Appearance
Positioning political texts with large language models by asking and averaging
Summary
Problem: 政治学研究中估计行动者(如政党、政治家)在意识形态和政策空间中的位置是核心任务,传统方法依赖人工编码(专家或众包)、投票记录或监督式文本分类器,这些方法成本高、耗时,且监督分类器需要大量标注训练数据。尽管LLM已被用于文本分类(离散标签),但将其用于文本缩放(连续位置估计)的研究极少,且现有少数研究存在依赖模型对政治人物的先验知识或使用概率分类等间接方式的局限。 Approach: 本文提出“询问并平均”(asking and averaging)方法:直接向指令微调LLM(如GPT-4、Llama 3、MiXtral、Aya)询问单条推文或政治文本中某个句子在特定维度(如左-右翼、经济政策、社会政策、反补贴-亲补贴)上的位置(0-100分),然后对所有句子的得分取平均,得到长文本或政治行动者的位置估计。研究在四个任务上评估该方法:美国国会议员推文、第117届国会参议员、英国政党宣言、欧盟多语言政策演讲。 Finding: 最佳LLM(如GPT-4o)产生的位置估计与基于专家编码、众包编码或投票记录的基准之间的相关性超过0.90。该方法在多数情况下优于基于约100万条推文训练的监督分类器(如BERT、GloVe、朴素贝叶斯),尤其在捕捉党内差异方面表现突出。对于英国政党宣言,最佳LLM的估计精度与人工众包编码相当。在多语言场景(10种语言)下,GPT-4o表现最佳。 Significance: 该方法为政治文本缩放提供了一种快速、成本极低(900条推文仅需$1.5 vs 人工编码£1,626)、可靠且(对开放模型)可复现的新途径,尤其适用于短文本和多语言比较研究,有望大幅扩展文本分析的应用范围。
Theoretical Framework
- Theoretical tradition: 文本即数据(text as data)传统,属于计算社会科学与政治学方法论的交叉领域。
- Prior theories built upon: 本文建立在文本缩放(text scaling)的既有方法之上,包括:基于词频的政党宣言定位(Laver, Benoit, and Garry 2003)、立法演讲定位(Lauderdale and Herzog 2016)、众包文本分析(Benoit et al. 2016)、基于投票记录的DW-NOMINATE(Poole and Rosenthal 1985; Nokken and Poole 2004)、基于Twitter连接的理想点估计(Barberá 2015)、基于竞选捐款的CF分数(Bonica 2014)。方法上直接继承Le Mens et al. (2023a) 的“直接查询”GPT-4测量概念典型性的思路。
- Causal mechanism: LLM在预训练过程中学习了大量文本与意识形态标签之间的统计关联,指令微调使其能够将这种隐含知识转化为对给定文本在指定维度上的直接数值判断。对多个句子(或推文)的估计取平均,可以抵消单句估计的随机误差,从而获得更稳定的文本或行动者位置。
- Key assumptions: (1) LLM对文本在意识形态维度上的判断与人类判断(专家或众包)具有高度一致性;(2) 文本内容本身包含了足够的意识形态信号,足以支撑位置估计;(3) 将温度参数设为0可以使LLM输出尽可能确定性,从而保证可复现性;(4) 对句子级估计取平均可以有效地聚合为文档级位置。
- Theoretical move: 本文应用并扩展了Le Mens et al. (2023a) 的“直接查询”方法,将其从概念典型性测量拓展到政治文本缩放这一核心政治学任务,并通过多任务、多语言、多模型的系统评估,验证了该方法相对于监督分类器的优势。它既不是对既有理论的挑战,也不是全新的理论综合,而是将LLM能力引入既有文本缩放方法论并给出实证支持。
- Scope conditions: 方法的有效性依赖于LLM对焦点维度的理解能力。作者指出,该方法适用于LLM有足够语言和语义理解的文本类型和语言;对于开放模型,结果可完全复现;对于多语言场景,不同模型在不同语言上的表现存在系统性差异,可能影响下游计量分析。作者强调,在未经验证的新领域使用前必须进行实证校验。
Research Design
本文为计算方法论研究(computational methods paper),采用多任务基准测试设计。研究单元包括:单条推文(N=899)、参议员(N=98)、政党宣言(N=18)、欧盟政策演讲(N=36)。关键自变量为LLM类型(10种不同模型,包括开放与封闭、不同规模与训练截止时间)。因变量为LLM产生的位置估计,操作化为:对推文或句子直接询问0-100分的位置得分,再对文档内所有有效得分取平均。基准(benchmark)因任务而异:推文和宣言使用众包/专家人工编码的平均评分,参议员使用DW-NOMINATE第一维度得分,欧盟演讲使用6种语言众包编码的平均值。所有LLM查询使用温度参数0、最大输出20个token、JSON格式响应。
Data & Sample
- 美国国会推文: 900条推文(来自Le Mens et al. 2023a),发布于GPT-4训练截止之后,确保不在预训练数据中。2023年11月招募597名Prolific参与者,每人评分30条推文,最终有效样本899条。
- 第117届国会参议员: 来自VoteView.com的参议员名单及Twitter用户名,通过Twitter API下载2021年1月3日至2023年1月3日期间推文,每名参议员随机抽取100条,排除少于100条的2名参议员,最终N=98。基准为Nokken-Poole时期特定DW-NOMINATE得分。
- 英国政党宣言: 来自Benoit et al. (2016) 的复制包,共18份宣言,在经济政策(左-右翼)和社会政策(保守-自由)两个维度上定位。基准为专家编码估计。
- 欧盟政策演讲: 来自Benoit et al. (2016),共36篇关于国家补贴政策提案的欧洲议会辩论演讲,使用10种语言发表。基准为6种语言(英、德、希、意、波、西)众包编码的平均值。
Analytical Strategy
主要分析策略为相关性分析:计算LLM产生的位置估计与各基准(众包、专家编码、DW-NOMINATE)之间的皮尔逊相关系数,包括总体相关和党内/组内相关。为评估可靠性,使用分裂半相关(split-half correlations)与Spearman-Brown校正(基于1000次随机分裂的平均值)。此外,将LLM方法与监督分类器(基于约100万条推文训练的微调BERT、GloVe词嵌入、TF-IDF朴素贝叶斯;以及基于Benoit et al. (2016) 众包评分训练的BERT分类器)进行对比。稳健性检查包括:对宣言任务在提示中加入维度描述(结果相似)、对欧盟演讲使用6种语言的翻译版本进行评估、对参议员任务使用竞选捐款CF分数作为替代基准(总体相关高,党内相关较低)。
Results & Findings
- 美国国会推文(N=899): 最佳LLM(GPT-4o)产生的位置估计与众包评分的相关性非常高(>0.90),且能同时捕捉党间和党内差异。监督分类器(BERT、GloVe、朴素贝叶斯)均无法匹配最佳LLM的表现,尤其在捕捉党内差异方面明显逊色。这表明LLM对短文本的意识形态定位能力超越了需要大量标注数据训练的监督方法。
- 第117届国会参议员(N=98): 将每名参议员100条推文的LLM位置估计取平均,所得参议员位置与基于投票记录的DW-NOMINATE得分高度相关,总体和党内均如此,且高于监督分类器的表现。与竞选捐款CF分数的相关也较高(但党内相关较低)。这说明“询问并平均”可以从推文中有效重建政治行动者的整体意识形态位置。
- 英国政党宣言(N=18): 最佳LLM在经济学和社会政策两个维度上的位置估计与专家编码高度相关,总体和党内均达到与人工众包编码相当的水平。即使不向LLM提供政策维度的描述,结果依然稳健。基于众包评分训练的BERT分类器并未优于最佳LLM。这表明LLM无需专门训练即可胜任长文档的维度定位。
- 欧盟多语言演讲(N=36): 在10种语言场景下,最佳模型(GPT-4o,其次是GPT-4 Turbo、MiXtral 8X22B、Llama 3 70B、Aya 23 35B)的位置估计与基准(6种语言众包编码平均)总体相关高,且按投票立场(支持/反对)分组后依然成立。使用6种语言的翻译版本评估时,最佳模型在各语言上表现良好。这验证了方法在多语言比较研究中的潜力,但不同模型在不同语言上的表现存在差异。
- 成本对比: 900条推文的LLM查询成本为$1.5(使用最贵的GPT-4 API),而人工众包编码成本为£1,626,成本差距超过千倍。
- 零结果与意外发现: 作者未报告明确的零结果,但指出将整个宣言放入单个提示(而非逐句处理)会导致性能下降;而将参议员的推文合并为单个提示则未造成显著性能退化。这一差异被列为未来研究方向。
Limitations
作者明确承认以下局限:(1) 位置估计的有效性受限于提交给LLM的文本本身所含信息,因此该方法类似于比较宣言项目(CMP)的逻辑,与基于专家感知调查(如Chapel Hill Expert Survey)的方法不同,结果可能因输入差异而不同;(2) LLM在某些经验情境下已知会产生有偏和不可靠的结果,因此不能假定该方法在所有领域和维度上都有效;(3) 多语言场景下,不同LLM在不同语言上的表现存在系统性差异,这种差异化的测量误差可能使下游计量分析产生偏差;(4) 对于长文本,是采用单提示还是逐句处理再平均,目前没有明确建议,两种方式在不同任务中表现不同;(5) 封闭模型(如GPT-4)无法完全复现结果,只有开放模型(如MiXtral、Llama 3)才能保证可复现性。
Key Contributions
- 提出并验证了一种新的政治文本缩放方法——“询问并平均”(asking and averaging),直接利用指令微调LLM的文本理解能力进行连续位置估计,区别于已有的分类式LLM标注方法。
- 系统评估了10种LLM(开放与封闭、不同规模)在4种不同任务(短推文、政治人物定位、长宣言、多语言演讲)上的表现,证明最佳LLM与人工编码基准的相关性超过0.90。
- 证明LLM方法在多数任务上优于基于大规模训练数据的监督分类器(BERT、GloVe、朴素贝叶斯),尤其在捕捉党内差异方面。
- 展示了该方法在多语言比较研究中的适用性(10种语言),并指出不同模型的语言表现差异及其对下游分析的潜在影响。
- 提供了详细的成本对比($1.5 vs £1,626),证明LLM方法在成本上比人工编码低数个数量级,同时速度快、易于实施。
- 为开放LLM(如MiXtral、Llama 3)在文本缩放中的使用提供了实证支持,强调其在可复现性和数据保护方面的优势。
- 提出了明确的实践建议:研究者应基于准确性、成本、速度、数据保护和可复现性五个维度选择LLM,并在新领域使用前必须进行逐案例的实证验证。
Key Claims
"We use instruction-tuned large language models (LLMs) like GPT-4, Llama 3, MiXtral, or Aya to position political texts within policy and ideological spaces." (Abstract)
"The correlations between the position estimates obtained with the best LLMs and benchmarks based on text coding by experts, crowdworkers, or roll call votes exceed .90." (Abstract)
"This approach is generally more accurate than the positions obtained with supervised classifiers trained on large amounts of research data." (Abstract)
"Using instruction-tuned LLMs to position texts in policy and ideological spaces is fast, cost-efficient, reliable, and reproducible (in the case of open LLMs) even if the texts are short and written in different languages." (Abstract)
"Until more is known about the range of domains in which LLMs perform well at scaling and other measurement tasks, case-by-case empirical validation remains essential." (Discussion)